Appearance
Topic classification for political texts with pretrained language models
Summary
Problem: 监督式主题分类需要大量标注数据,而高质量标注数据获取成本高昂,成为研究瓶颈。Osnabrügge等人(2021)提出的跨领域主题分类方法虽能缓解数据稀缺问题,但需要依赖大规模源领域标注数据集,且模型需从头训练。 Approach: 本文提出使用预训练语言模型(RoBERTa-base)进行微调,直接利用目标领域中原本用于验证跨领域分类器的小型标注数据集来训练领域内分类器,替代跨领域分类方法。 Finding: 使用目标语料库70%标注数据(2,915个样本)微调的RoBERTa模型,在44主题和8主题分类任务上全面超越跨领域分类器(top-1准确率分别提升27.3%和22.5%);仅需300个训练样本即可匹配或超越跨领域分类器性能;训练和推理时间均在研究者可接受范围内。 Significance: 该研究为政治文本分类中的数据稀缺问题提供了更高效、更经济的解决方案,使研究者无需依赖大规模跨领域标注数据集即可训练出高性能分类器,降低了监督式学习的门槛。
Theoretical Framework
N/A
Research Design
本文为计算实验研究。研究类型为基准测试(benchmark)对比实验,将微调预训练语言模型(RoBERTa-base)与Osnabrügge等人(2021)的跨领域分类器在相同测试集上进行性能比较。分析单元为新西兰议会演讲文本。自变量为模型类型(微调语言模型 vs. 跨领域分类器)和训练样本数量(200/300/400/2,915);因变量为分类性能,通过top-1准确率/F1 micro、top-3准确率、top-5准确率、平衡准确率和F1 macro等指标操作化。主实验中,70%数据用于训练、15%用于验证、15%用于测试,使用验证集准确率选择最优epoch和检查点。
Data & Sample
样本量为4,165条新西兰议会演讲文本,来自Osnabrügge等人(2021)的目标领域数据集,这些文本原本是为验证跨领域主题分类效果而标注的。数据来源为新西兰议会演讲记录,由Manifesto编码员按Manifesto项目主题体系进行标注。主实验中,2,915个样本用于训练、625个用于验证、625个用于测试。跨领域分类器使用115,420条标注政策声明(来自英语国家政党宣言)进行训练。实验设置随机种子以确保可复现性,并报告五次随机运行的平均结果。
Analytical Strategy
采用微调RoBERTa-base模型进行44主题和8主题分类。模型配置:12层transformer、1.25亿参数,在分类层之上添加分类层,使用交叉熵损失函数,学习率2e-5,批大小16,输入序列长度512,在A100 GPU上训练。使用验证集准确率选择最优epoch和检查点,测试时批大小为64。评估指标与Osnabrügge等人(2021)保持一致。训练样本数量实验中,分别使用200、300、400个训练样本微调20个epoch,每种设置运行五次并报告均值±标准差。为确保测试集一致,先采样400个训练样本,再按需降采样至200或300。报告五次随机运行的平均结果以控制随机性。
Results & Findings
- 主实验发现:在44主题分类中,微调RoBERTa模型的top-1准确率为52.7%,比跨领域分类器的41.4%高出27.3%;在8主题分类中,top-1准确率为63.1%,比跨领域分类器的51.5%高出22.5%。在其他指标上也有显著提升:top-3准确率提升10%以上、top-5准确率提升5%以上、平衡准确率提升16%以上、F1 macro提升12%以上。这表明使用目标领域部分标注数据微调语言模型是可行的。
- 按主题表现:在44主题分类中,微调模型在样本量较大的主题上表现更好——测试集中样本超过10个的主题中,除“education”和“equality”外,微调模型均优于或持平跨领域分类器。但在稀有主题(如“nationalization”和“underprivileged minority groups”)上,微调模型的优势消失,因为训练阶段未见足够样本;跨领域分类器因训练时见过更多此类样本而具有优势。在8主题分类中,微调模型在八个主题中的七个上优于跨领域分类器,因为主题数量减少使每个主题的样本量增大。
- 训练样本数量实验:仅需300个训练样本,微调语言模型即可在44主题和8主题分类任务上超越跨领域分类器。这意味着研究者只需几百个训练样本即可考虑使用微调语言模型作为有效方案。
- 训练与推理时间:在单张A100 GPU(40GB内存)上,对2,915个样本训练20个epoch需27分钟;推理速度约为每秒145次推断,10,000次推断仅需1分多钟。训练时间随样本量减少线性下降,整体时间投入与跨领域分类器训练(27分钟)相当,符合研究者的时间预算。
Limitations
- 在目标领域训练样本极少或为零的主题上,微调语言模型相对于跨领域分类器的优势基本消失,因为模型在训练阶段未见过足够的相关样本。
- 部分稀有主题(如“underprivileged minority groups”)的准确率差异在比例差异检验中不具有统计显著性。
- 本文仅使用单一预训练语言模型(RoBERTa-base),未系统比较其他模型(如BERT-large、RoBERTa-large)的性能与速度权衡。
- 训练时间比较涉及GPU与CPU的不对等比较,作者承认这种比较并不完全公平。
- 实验仅基于新西兰议会演讲这一单一目标领域,未验证方法在其他政治文本类型上的泛化性。
Key Contributions
- 提出微调预训练语言模型作为跨领域主题分类的替代方案,直接利用目标领域的小型标注数据集训练领域内分类器。
- 实证证明仅用目标语料库70%标注数据微调的RoBERTa模型即可大幅超越使用115,420条跨领域数据训练的分类器。
- 发现仅需300个训练样本即可匹配或超越跨领域分类器性能,显著降低了标注成本门槛。
- 证明微调语言模型的训练和推理时间符合研究者的时间预算,具有实际可行性。
- 提供公开可复现的代码和数据(Harvard Dataverse),便于其他研究者使用和验证。
Key Claims
"We show that language models fine-tuned with 70% of the small annotated dataset in the target corpus could outperform models trained using large cross-domain datasets by 27% and that models fine-tuned with 10% of the annotated dataset could already outperform the cross-domain classifiers." (Abstract)
"Across all metrics and both 44-topic and 8-topic classification tasks, fine-tuning the RoBERTa model with a subset of the labeled New Zealand parliamentary speeches substantially outperforms the cross-domain topic classifier by Osnabrügge et al. (2021), which is trained using 115,420 annotated policy statements." (Section 3.1)
"We observe that with 300 training samples, the fine-tuned language model is able to outperform the cross-domain classifier on the 44-topic classification task (left) and the 8-topic classification task (right)." (Section 3.3)
"We have also noted that in topics where there are few to no in-domain training samples, the advantage of the fine-tuned language model over cross-domain classifiers largely disappears." (Section 4)
"Lastly, we have shown that the fine-tuned models are competitive in terms of training time and inference time." (Section 4)